Micron Document
██████╗ ███████╗████████╗██╗██████╗ ███████╗██████╗ ██╗ █████╗
██╔══██╗██╔════╝╚══██╔══╝██║██╔══██╗██╔════╝██╔══██╗██║██╔══██╗
██████╔╝█████╗ ██║ ██║██████╔╝█████╗ ██║ ██║██║███████║
██╔══██╗██╔══╝ ██║ ██║██╔═══╝ ██╔══╝ ██║ ██║██║██╔══██║
██║ ██║███████╗ ██║ ██║██║ ███████╗██████╔╝██║██║ ██║
╚═╝ ╚═╝╚══════╝ ╚═╝ ╚═╝╚═╝ ╚══════╝╚═════╝ ╚═╝╚═╝ ╚═╝


🬧 The NomadNet Encyclopedia | Archives | Info
- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b- `b

🔍 Search

¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯¯

Crawler
──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────
top
Un mwbgcrawler (detto anche mwbwweb crawler, mwcaspider o mwcqrobot), è un mwcgsoftware con cui di solito un motore di ricerca analizza i contenuti di una rete (o di un mwcwdatabase) in un modo metodico e automatizzato. Nello specifico, un crawler è un tipo di mwdabot (programma o mwdqmwdgscript che automatizza delle operazioni), che solitamente acquisisce una copia testuale di tutti i documenti presenti in una o più pagine web creando un indice che ne permetta, successivamente, la ricerca e la visualizzazione.

Un uso estremamente comune dei crawler viene effettuato sul mweaWeb; esso si basa su una lista di mweqURL da visitare fornita dal motore di ricerca (il quale, inizialmente, si basa a sua volta sugli indirizzi suggeriti dagli utenti o su una lista precompilata dai programmatori stessi). Durante l'analisi di una URL, identifica tutti i mwegcollegamenti ipertestuali presenti nel documento e li aggiunge alla lista di URL da visitare. Il processo può essere concluso manualmente o dopo che un determinato numero di collegamenti è stato seguito.

Inoltre i crawler attivi su mwfaInternet hanno la facoltà di essere indirizzati da quanto indicato nel file "mwfqrobots.txt" posto nella mwfgroot del sito. All'interno di questo file, è possibile indicare quali pagine non dovrebbero essere analizzate. Il crawler ha la facoltà di seguire i consigli, ma non l'obbligo.

| Crawler | Motore di ricerca |
|---|---|
| Googlebot | Google |
| Fast | Fast - Alltheweb |
| Slurp | Inktomi - Yahoo! |
| Scooter | AltaVista |
| Mercator | AltaVista |
| Ask Jeeves | Ask Jeeves |
| Teoma agent | Teoma |
| Ia archiver | Alexa - Internet Archive |
| Yahoo! Slurp | Yahoo |
| Romilda | Facebook |
| DuckDuckBot | DuckDuckGo |

Contents

Note

──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────

Esempi di Web crawlers

La seguente è una lista di mwtqarchitetture pubbliche di crawler di carattere generico:

• mwuaBucean (Eichmann, 1994) è stato il primo crawler pubblico. È basato su due programmi: il primo, "mwuqspider" mantiene la richiesta in un database relazionale, e il secondo "mwugmite", è un browser mwuwwww mwvaASCII che scarica le pagine dal web.
• mwvgWebCrawler (Pinkerton, 1994) è stato usato per costruire il primo indice testuale di pubblicità di un ramo del web. Era basato su lib-WWW per scaricare le pagine, e un altro programma per analizzare e ordinare URL per esplorazione tramite metodo grafico breadth-first. Include anche un crawler in tempo reale che segue i collegamenti basati sulle similarità del testo-ancora con la query condizionale.
• mwwaTennSpider (McBryan, 1994) era un crawler usato per costruire un semplice indice di titoli di documento e URL. L'indice poteva essere cercato usando il comando mwwqgrep mwwgUnix.
• mwxaGoogle Crawler (Brin and Page, 1998) è descritto in alcuni dettagli, ma il riferimento è solo su una precedente versione di quell'architettura, la quale è basata su mwxqC++ e Python. Il crawler fu integrato col processo di indicizzazione, perché la selezione del testo fu fatta per indicizzare completamente il testo e anche per l'estrazione degli URL. Un server URL invia liste di URL per essere prelevato da diversi processi di crawling. Durante il mwxgparsing, gli URL trovati sono inviati a un server URL che controlla se l'URL è stato visto precedentemente. Se no, l'URL è aggiunto all'interrogazione del server URL.
• mwyaVnzOwna (da Silva mwyqet al., 1999) usato come schedulatore centrale e serie di collettori distribuiti. I collettori parsificano le pagine web scaricate e inviano gli URL scoperti allo schedulatore, il quale assegna il turno ai collettori. Lo schedulatore rinforza la ricerca ordinata breadth-first con una politica senza ordine per evitare il sovraccarico dei mwygserver web. Il crawler è scritto in mwywPerl.
• mwzqMercator (Heydon and Najork, 1999; Najork and Heydon, 2001) è un web crawler modulare distribuito e scritto in mwzgJava. La sua modularità sorge dall'uso di "moduli di protocollo" intercambiabili e "modelli di processo". I moduli di protocollo sono correlati per acquisire le pagine web (es: HTTP), e i moduli di processo sono correlati per processare le pagine web. I moduli standard possono essere usati per indicizzare il testo delle pagine, o per raccogliere statistiche dal Web.
• mwaaWebFountain (Edwards mwaqet al., 2001) è un crawler simile a Mercator ma scritto in mwagC++. La sua particolarità sta nella "controller machine" che coordina una serie di "macchine-formiche". Dopo un ripetitivo scarico di pagine, un fattore di cambio è calcolato per ogni pagina e un metodo di programmazione non lineare deve essere usato per risolvere il sistema di equazione per massimizzare l'aggiornamento. Gli autori raccomandano di usare questo ordine di crawling nelle prime parti, e poi scambiare l'ordine uniforme nel quale tutte le pagine sono state visitate con la stessa frequenza.
• mwbaPolyBot [Shkapenyuk and Suel, 2002] è un crawler scritto in mwbqC++ e mwbgPython, composto da un manager, uno o più downloader e uno o più rilevatori DNS. Gli URL collezionati sono aggiunti su disco e processati più tardi per cercarli in modalità batch. La regolamentazione considera entrambi domini di terzi e secondi livelli (es di terzo: www.aaa.com, www2.aaa.com) perché i domini di terzo livello sono solitamente ospitati dallo stesso webserver.
• mwcaWebRACE (Zeinalipour-Yazti and Dikaiakos, 2002) è un modulo sviluppato in Java di crawling e caching, e usato come parte di un sistema più generico chiamato eRACE. La maggior funzionalità che spicca in Webrace è che, mentre molti crawler iniziano a cercare con un set di semi URL, WebRACE riceve continuamente nuovi URL dal form.
• mwcgUbicrawler (Boldi mwcwet al., 2004) è un crawler scritto in Java. È composto da un numero di 'agenti' identici e la funzione di assegnamento è calcolata usando l'hashing dei nomi di host. Non c'è overlap, questo significa che nessuna pagina è indicizzata due volte, fino a quando un agente crawler non crasha; raggiunge alta scalabilità ed è tollerante ai fallimenti.
• mwdqFAST Crawler (Risvik and Michelsen, 2002) è un crawler usato dai Fast Search & Transfer.
• mweaLabrador,un crawler privato che collabora con il progetto mweqOpen Source chiamato Terrier Search Engine.
• mwfaSpinn3r, è un crawler usato per costruire l'anima di Tailrank.com. Spinn3r è basato su mwfqJava e la maggior parte dell'architettura è Open Source.
• mwfwHotCrawler, è scritto in mwgaC e mwgqPHP.

Crawler di tipo open source

• mwhqDataparkSearch è un crawler e motore di ricerca distribuito sotto la mwhgGNU General Public License.
• mwiaEbot è un crawler scalabile e distribuito scritto in Erlang e distribuito sotto la mwiqGNU General Public License.
• mwiwWget è un crawler a riga di comando scritto in mwjaC e distribuito sotto la mwjqGNU General Public License. È tipicamente usato per siti mirror e mwjgFTP.
• mwkaHeritrix è il crawler di maggior qualità di estrazione dagli archivi web, studiato per archiviare periodici mwkgscreenshot di una larga porzione del web. È stato scritto in mwkwJava.
• mwlqHtdig include un crawler web nel suo motore di indicizzazione.
• mwlwmwmaHTTrack usa un web crawler per creare una replica di un sito web per la consultazione off-line. È stato scritto in C e distribuito sotto licenza mwmqGNU GPL.
• mwmwJSpider è un web spider altamente personalizzabile distribuito sotto licenza GNU GPL.
• mwnqMethabot è un web crawler ottimizzato per la velocità e a riga di comando scritta in mwngC e distribuito sotto mwnwlicenza ISC. Comprende un sistema di configurazione, un modulo di sistema e supporto per obiettivi di crawling attraverso il mwoafile system locale, HTTP o FTP.
• mwogNutch è un crawler scritto in mwowJava sotto mwpalicenza Apache. Può essere usato assieme all'indice testuale creato con mwpqLucene.
• mwpwWebVac è un crawler usato dal Stanford WebBase Project.
• mwqgWebSPHINX (Miller e Bharat, 1998) è composto da una libreria Java che implementa la query multipla delle pagine web e il parsing HTML, un'interfaccia utente grafica per impostare gli indirizzi di partenza per estrarre i dati scaricati e per implementare un motore di ricerca basilare di testo.
• mwraWIRE - Web Information Retrieval Environment (Baeza-Yates e Castillo, 2002) è un web crawler scritto in mwrqC++ e distribuito sotto licenza GPL, inclusi diverse linee di condotta per catalogare le pagine web scaricate e un modulo per generare statistiche e rapporti sulle pagine scaricate, usato per la caratterizzazione web.
• mwrwLWP::RobotUA (Langheinrich, 2004) è una classe Perl distribuita sotto licenza Perl5.
• mwsqWeb Crawler è web crawler open source per mwsg.NET scritto in mwswC#.
• mwtqSherlock Holmes raccoglie e indicizza dati testuali (file di testo, pagine web, ecc.), sia localmente sia nella rete. Holmes è sponsorizzato e usato commercialmente dal portale web ceco Centrum. è usato inoltre dal sito Onet.pl.
• mwtwYaCy è un motore di ricerca liberamente distribuito, costruito sui principi dei network di mwuap2p (sotto licenza GPL).
• mwugRuya è open source ad alte prestazioni basato sulla ricerca Breadth-first, crawler di livello base. È usato per gestire siti web inglesi e giapponesi nel miglior modo possibile. È distribuita sotto licenza GPL e scritto interamente in linguaggio mwuwPython.
• mwvqUniversal Information Crawler è un web crawler di uso veloce. Salva e analizza i dati.
• mwvwAgent Kernel è una struttura Java per pianificare, trattare e stoccare i dati durante il crawling.
• mwwqSquzer, un web crawler open source, espandibile, multifunzione scritto in Python.
• mwwwArachnode.NET è un web crawler open source promiscuo per scaricare, indicizzare e salvare contenuti Internet incluse e-mail, file, hyperlink, immagini e pagine web. Arachnode.net è scritto in mwxaC# usando mwxqSQL Server 2005 ed è distribuito sotto licenza GPL.
• mwxwBBragnet è un web crawler open source (per server mwyaLinux) scritto in mwyqPHP.
• mwywScrapy è un web crawler open source scritto in mwzaPython.

Critiche

Il termine mwzwWeb Crawler viene utilizzato anche per indicare i controversi mw0aoffline browser, come: mw0qPageNest (ex mw0gWebStripper), mw0wMSIECrawler, mw1aOffline Explorer, ecc. Questi programmi sono concepiti per scaricare sul mw1qdisco fisso del computer dell'utente il contenuto di un intero sito web. Ad esempio, mw1gMemory Alpha ne vieta l'utilizzo perché accedono al sito in modo aggressivo, rallentando drasticamente la fruizione del sito stesso da parte degli altri utenticite-ref-1[1] e i trasgressori rischiano di essere bloccaticite-ref-2[2].

Note

cite-note-11. mw5q(mw5gmw5wEN) mw6amw6qMemory Alpha:Database download, su mw6gmemory-alpha.org. mw6wURL consultato il 28 dicembre 2010.
cite-note-22. Vedi il file robots.txt di Memory Alpha

Voci correlate
Altri progetti

Altri progetti

• Wikizionario

• Wikizionario contiene il lemma di dizionario «crawler»

Collegamenti esterni

• citerefbritannica-com(EN) Web crawler, su Enciclopedia Britannica, Encyclopædia Britannica, Inc.
• mw-wPolyBot, su cis.poly.edu. URL consultato il 5 aprile 2008 (archiviato dall'url originale il 30 aprile 2008).
• mwaqeWebRACE, su grid.ucy.ac.cy. URL consultato il 5 aprile 2008 (archiviato dall'url originale il 28 dicembre 2007).
• mwaqmUbicrawler, su law.dsi.unimi.it. URL consultato il 5 aprile 2008 (archiviato dall'url originale il 10 aprile 2008).
• mwaquLabrador, su ir.dcs.gla.ac.uk. URL consultato il 5 aprile 2008 (archiviato dall'url originale il 31 dicembre 2007).
• mwaqcSpinn3r, su spinn3r.com. URL consultato il 29 agosto 2019 (archiviato dall'url originale il 13 marzo 2018).
• mwaqkHtdig, su htdig.org. URL consultato il 5 aprile 2008 (archiviato dall'url originale l'8 aprile 2008).